Micron Document




Modèle texte-image
──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────
top
Un modèle texte-image (ou texte-image) est un modèle d'apprentissage automatique qui prend en entrée une description en langage naturel et produit une image correspondant à cette description. Ces modèles sont utilisés dans le domaine de l'intelligence artificielle générative.

Les modèles texte-image commencent à se développer au milieu des années 2010 lors du boom de l'IA en raison des avancées scientifiques dans le domaine de l'apprentissage profondcite-ref-imagen-verge-1-0[1].

En 2022, la sortie des modèles texte-image de pointe – tels que DALL-E 2 d'OpenAI, Imagen de Google Brain, Stable Diffusion de Stability AI et Midjourney – marque une étape décisive alors que les images générées par ces modèles s'approchent de la qualité des photographies réelles et de l’art dessiné par des humains.

Les modèles texte-image sont généralement des modèles de diffusion latente, qui combinent un modèle de langage, transformant le texte d'entrée en une représentation latente, et un modèle génératif d'image, qui produit une image conditionnée par cette représentation. Les modèles les plus efficaces s'entraînent généralement sur d'importantes quantités de données image et texte extraites du webcite-ref-imagen-verge-1-1[1].

Contents


──────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────────

Histoire

Avant l'essor de l'apprentissage profondcite-ref-agnese-2-0[2], les tentatives de construire des modèles texte-image se limitent à des collages en arrangeant des éléments d'images existantes, telles que celles provenant d'une base de données de clip artcite-ref-zhu-2007-3-0[3].

La tâche inverse, le légendage d'images, est plus accessible, et plusieurs modèles de légendage d'images basés sur l'apprentissage profond apparaissent avant les premiers modèles texte-imagecite-ref-mansimov-2015-4-0[4].

Le premier modèle moderne de texte-image, alignDRAW, apparaît en 2015 grâce à des chercheurs de l'Université de Toronto. alignDRAW étend l'architecture DRAW précédemment introduite (qui utilise un réseau de neurones récurrents sous la forme d'un auto-encodeur variationnel récurrent avec un mécanisme d'attention) pour être conditionnée par des séquences de textecite-ref-mansimov-2015-4-1[4]. Les images générées par alignDRAW présentent une faible résolution d'image (32×32 pixels, obtenus par redimensionnement d'image) et sont considérées comme «faiblement diverses». Le modèle parvient à généraliser à des objets non représentés dans les données d'entraînement (tel qu'un autobus scolaire rouge) et gère de manière appropriée des consignes inédites telles que «un panneau stop vole dans un ciel bleu», démontrant que sa sortie ne se contente pas de «mémoriser» les données de l'ensemble d'entraînementcite-ref-mansimov-2015-4-2[4]cite-ref-reed-2016-5-0[5].

En 2016, Reed, Akata, Yan et al. utilisent pour la première fois des réseaux antagonistes génératifs pour la tâche de texte-imagecite-ref-reed-2016-5-1[5]cite-ref-frolov-6-0[6]. Avec des modèles entraînés sur des ensembles de données étroits et spécifiques à un domaine, ils parviennent à générer des images «visuellement plausibles» d'oiseaux et de fleurs à partir de légendes telles que «un oiseau entièrement noir avec un bec épais et arrondi». Un modèle entraîné sur l'ensemble de données plus diversifié COCO (Common Objects in Context) produit des images qui, «de loin... sont encourageantes», mais qui manquent de cohérence dans leurs détailscite-ref-reed-2016-5-2[5]. Des systèmes ultérieurs incluent VQGAN-CLIPcite-ref-7[7], XMC-GAN, et GauGAN2cite-ref-8[8].

L'un des premiers modèles texte-image à capter l'attention du grand public est OpenAI's DALL-E, un système basé sur le transformeur annoncé en janvier 2021cite-ref-tc-dalle-9-0[9]. Un successeur capable de générer des images plus complexes et réalistes, DALL-E 2, est dévoilé en avril 2022cite-ref-tc-dalle-2-10-0[10], suivi de Stable Diffusion qui est rendu public en août 2022cite-ref-11[11]. En août 2022, la personnalisation texte-image permet d'enseigner au modèle un nouveau concept à l'aide d'un petit ensemble d'images d'un nouvel objet qui n'est pas inclus dans l'ensemble d'entraînement du modèle de base. Ceci s'obtient par inversion textuelle, c'est-à-dire en trouvant un nouveau terme textuel qui correspond à ces images.

À la suite d'autres modèles texte-image, des plateformes texte-vers-vidéo propulsées par des modèles de langage telles que Runway, Make-A-Videocite-ref-12[12], Imagen Videocite-ref-13[13], Midjourneycite-ref-14[14], et Phenakicite-ref-15[15] peuvent générer des vidéos à partir de textes et/ou de consignes textuelles ou imagecite-ref-16[16].

Architecture et entraînement

Les modèles texte-image se construisent à l'aide de diverses architectures. L'étape d'encodage du texte peut être effectuée avec un réseau de neurones récurrents tel qu'un réseau long short-term memory, bien que les modèles transformeur soient depuis devenus une option plus populaire. Pour l'étape de génération d'image, des réseaux antagonistes génératifs conditionnels (GANs) s'utilisent couramment, tandis que les modèles de diffusion gagnent en popularité ces dernières années. Plutôt que d'entraîner directement un modèle à produire une image haute résolution conditionnée par un encodage de texte, une technique populaire consiste à entraîner un modèle à générer des images de basse résolution, puis à utiliser un ou plusieurs modèles d'apprentissage profond auxiliaires pour l'upscaler en complétant les détails fins.

Les modèles texte-image s'entraînent sur d'importants ensembles de paires (texte, image), souvent extraites du web. Avec leur modèle Imagen de 2022, Google Brain rapporte des résultats positifs en utilisant un grand modèle de langage entraîné séparément sur un corpus de texte seul (avec des poids ensuite figés), marquant ainsi une rupture avec l'approche standard jusque-làcite-ref-imagen-paper-17-0[17].

Jeux de données

L'entraînement d'un modèle texte-image nécessite un ensemble de données associant des images à des légendes textuelles. Un ensemble de données couramment utilisé à cet effet est l'ensemble de données COCO. Publié par Microsoft en 2014, COCO se compose d'environ 123 000 images représentant une diversité d'objets avec cinq légendes par image, générées par des annotateurs humains. À l'origine, l'objectif principal de COCO porte sur la reconnaissance d'objets et de scènes dans les images.

Oxford-120 Flowers et CUB-200 Birds sont des ensembles de données plus restreints d'environ 10 000 images chacun, se concentrant respectivement sur les fleurs et les oiseaux. Il apparaît moins difficile d'entraîner un modèle texte-image de haute qualité avec ces ensembles de données en raison de leur champ thématique étroitcite-ref-frolov-6-1[6].

L'un des plus grands ensembles de données ouverts pour l'entraînement de modèles texte-image est LAION-5B, contenant plus de 5 000 000 000 paires image-texte. Cet ensemble de données est obtenu par extraction web et filtrage automatique basé sur la similarité avec des œuvres d'art de haute qualité et des photographies professionnelles. Cependant, il comporte également du contenu controversé, ce qui suscite des discussions sur l'éthique de son utilisation.

Certaines plateformes d'IA modernes ne se contentent pas de générer des images à partir de texte, elles créent également des ensembles de données synthétiques pour améliorer l'entraînement et l'affinage des modèles. Ces ensembles de données aident à éviter les problèmes de droit d'auteur et élargissent la diversité des données d'entraînementcite-ref-debatly-ai-18-0[18].

Évaluation de la qualité

L'évaluation et la comparaison de la qualité des modèles texte-image impliquent l'appréciation de multiples propriétés souhaitables. Un critère spécifique aux modèles texte-image est que les images générées s'alignent sémantiquement avec les légendes utilisées pour les générer. Plusieurs schémas sont mis au point pour évaluer ces qualités, certains automatisés et d'autres basés sur le jugement humaincite-ref-frolov-6-2[6].

Une métrique algorithmique courante pour évaluer la qualité et la diversité des images est le Score d'inception, qui se fonde sur la distribution des étiquettes prédites par un modèle de classification d'image Inceptionv3 pré-entraîné lorsqu'il s'applique à un échantillon d'images générées par le modèle texte-image. Le score augmente lorsque le modèle de classification prédit une étiquette unique avec une forte probabilité, une méthode destinée à favoriser des images générées «distinctes». Une autre métrique populaire est la distance d'inception de Fréchet, qui compare la distribution des images générées à celle des images réelles d'entraînement selon les caractéristiques extraites par l'une des dernières couches d'un modèle de classification d'image pré-entraînécite-ref-frolov-6-3[6].

Liste des modèles notables de texte-image

| Nom | Date de sortie | Développeur | Licence |
|---|---|---|---|
| DALL-E | janvier 2021 | OpenAI | Propriétaire |
| DALL-E 2 | avril 2022 | OpenAI | Propriétaire |
| DALL-E 3 | septembre 2023 | OpenAI | Propriétaire |
| Ideogram 2.0 | août 2024 | Ideogram | Propriétaire |
| Imagen | avril 2023 | Google | Propriétaire |
| Imagen 2 | décembre 2023 [ 19 ] | Google | Propriétaire |
| Imagen 3 | mai 2024 | Google | Propriétaire |
| Parti | Non publié | Google | Propriétaire |
| Firefly | mars 2023 | Adobe Inc. | Propriétaire |
| Midjourney | juillet 2022 | Midjourney, Inc. | Propriétaire |
| Stable Diffusion | août 2022 | Stability AI | Stability AI Community License |
| Flux | août 2024 | Black Forest Labs | Licence Apache |
| Aurora | décembre 2024 | xAI | Propriétaire |
| RunwayML | 2018 | Runway AI, Inc. | Propriétaire |

Voir aussi
Références

• (en) Cet article est partiellement ou en totalité issu de l’article de Wikipédia en anglais intitulé « Text-to-image model » (voir la liste des auteurs).

cite-note-imagen-verge-11. vincent2022james-vincent2022James Vincent, « All these images were generated by Google's latest text-to-image AI », The Verge,‎ 24 mai 2022 (lire en ligne, consulté le 28 mai 2022)
cite-note-agnese-22. agneseherrerataozhu2019jorge-agnesejonathan-herrerahaicheng-taoxingquan-zhu2019Jorge Agnese, Jonathan Herrera, Haicheng Tao et Xingquan Zhu, A Survey and Taxonomy of Adversarial Neural Networks for Text-to-Image Synthesis, octobre 2019 (arXiv 1910.09399)
cite-note-zhu-2007-33. zhugoldbergeldawydyer2007xiaojin-zhuandrew-b-goldbergmohamed-eldawycharles-r-dyer2007Xiaojin Zhu, Andrew B. Goldberg, Mohamed Eldawy, Charles R. Dyer et Bradley Strock, « A text-to-picture synthesis system for augmenting communication », AAAI, vol. 7,‎ 2007, p. 1590–1595 (lire en ligne)
cite-note-mansimov-2015-44. mansimovparisottolei-basalakhutdinov2015elman-mansimovemilio-parisottojimmy-lei-baruslan-salakhutdinov2015Elman Mansimov, Emilio Parisotto, Jimmy Lei Ba et Ruslan Salakhutdinov, « Generating Images from Captions with Attention », ICLR,‎ novembre 2015 (arXiv 1511.02793)
cite-note-reed-2016-55. reedakatalogeswaranschiele2016scott-reedzeynep-akatalajanugen-logeswaranbernt-schiele2016Scott Reed, Zeynep Akata, Lajanugen Logeswaran, Bernt Schiele et Honglak Lee, « Generative Adversarial Text to Image Synthesis », International Conference on Machine Learning,‎ juin 2016 (arXiv 1605.05396, lire en ligne)
cite-note-frolov-66. frolovhinzrauehees2021stanislav-frolovtobias-hinzfederico-rauej-rn-hees2021Stanislav Frolov, Tobias Hinz, Federico Raue, Jörn Hees et Andreas Dengel, « Adversarial text-to-image synthesis: A review », Neural Networks, vol. 144,‎ décembre 2021, p. 187–209 (PMID 34500257, DOI 10.1016/j.neunet.2021.07.019 , arXiv 2101.09983, S2CID 231698782)
cite-note-77. rodriguez2022jesus-rodriguez2022(en) Jesus Rodriguez, « 🌅 Edge#229: VQGAN + CLIP », sur thesequence.substack.com,‎ 27 septembre 2022 (consulté le 10 octobre 2022)
cite-note-88. rodriguez2022jesus-rodriguez2022(en) Jesus Rodriguez, « 🎆🌆 Edge#231: Text-to-Image Synthesis with GANs », sur thesequence.substack.com,‎ 4 octobre 2022 (consulté le 10 octobre 2022)
cite-note-tc-dalle-99. coldewey2021devin-coldewey2021Devin Coldewey, « OpenAI's DALL-E creates plausible images of literally anything you ask it to », sur TechCrunch, 5 janvier 2021
cite-note-tc-dalle-2-1010. coldewey2022devin-coldewey2022Devin Coldewey, « OpenAI's new DALL-E model draws anything — but bigger, better and faster than before », sur TechCrunch, 6 avril 2022
cite-note-1111. « Stable Diffusion Public Release », sur Stability.Ai (consulté le 27 octobre 2022)
cite-note-1212. kumar2022ashish-kumar2022(en-US) Ashish Kumar, « Meta AI Introduces 'Make-A-Video': An Artificial Intelligence System That Generates Videos From Text », sur MarkTechPost, 3 octobre 2022 (consulté le 3 octobre 2022)
cite-note-1313. edwards2022benj-edwards2022(en-US) Benj Edwards, « Google's newest AI generator creates HD video from text prompts », sur Ars Technica, 5 octobre 2022 (consulté le 25 octobre 2022)
cite-note-1414. rodriguez2022jesus-rodriguez2022(en) Jesus Rodriguez, « 🎨 Edge#237: What is Midjourney? », sur thesequence.substack.com,‎ 25 octobre 2022 (consulté le 26 octobre 2022)
cite-note-1515. « Phenaki », sur phenaki.video (consulté le 3 octobre 2022)
cite-note-1616. edwards2022benj-edwards2022Benj Edwards, « Runway teases AI-powered text-to-video editing using written prompts », Ars Technica,‎ 9 septembre 2022 (lire en ligne, consulté le 12 septembre 2022)
cite-note-imagen-paper-1717. sahariachansaxenali(en) Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang et al., « Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding », 23 mai 2022.
cite-note-debatly-ai-1818. martin2025Martin, « AI-Powered Text and Image Generation », sur Debatly, 29 janvier 2025
cite-note-191. (en-US) « Imagen 2 on Vertex AI is now generally available », sur Google Cloud Blog (consulté le 2 janvier 2024)

• Portail de l’intelligence artificielle
• Portail de l’imagerie numérique